Series

LLM 理论精读

共 3 讲,建议按顺序阅读。

  1. 01 A · Flash Attention 标准 Attention 的显存墙问题,如何通过分块 (Tiling) 与在线 Softmax 将时间复杂度从 O(N^2) 降到 O(N)。
  2. 02 C · MoE 混合专家架构 稠密模型的计算瓶颈,如何通过路由机制 (Router) 激活少量专家实现「总参数量大但计算量不变」,以及 DeepSeek 等模型的改进。
  3. 03 B · RoPE 旋转位置编码 如何将绝对位置转化为旋转矩阵,使 Query 和 Key 的点积自然包含相对位置关系,兼具良好的长度外推性。